Approche avec les équations de Bellman

4. Équation de Bellman

Pour commencer, regardons une vue schématique de la situation :


En manipulant les fonctions de valeur d'état et de valeur d'action, on peut mettre en lumière une propriété récursive importante.

${V_\pi }\left( s \right)$$\quad$$={E_\pi }\left[ {{G_t}|{S_t} = s} \right]$

$\qquad\qquad= {E_\pi }\left[ {\sum\limits_{k = 0}^\infty {{\gamma ^k}{r_{t + k}}} |{S_t} = s} \right]= {E_\pi }\left[ {{r_{t}} + \sum\limits_{k = 0}^\infty {{\gamma ^{k + 1}}{r_{t + k + 1}}} |{S_t} = s} \right]$

$\qquad\qquad={E_\pi }\left[ {{r_{t}} + \gamma \sum\limits_{k = 0}^\infty {{\gamma ^k}{r_{t + k + 1}}} |{S_t} = s} \right]$

$\qquad\qquad={E_\pi }\left[ {{r_{t}} + \gamma {G_{t + 1}}|{S_t} = s} \right]$

$\qquad\qquad={E_\pi }\left[ {{r_{t}}|{S_t} = s} \right] + \gamma {E_\pi }\left[ {{G_{t + 1}}|{S_t} = s} \right]$

Étudions maintenant le premier terme:

${E_\pi }\left[ {{r_{t}}|{S_t} = s} \right] = \sum\limits_a {\pi \left( {a|s} \right)E\left[ {{r_t}|{S_t} = s} \right]} = {\sum\limits_a {\pi \left( {a|s} \right)\sum\limits_{s'} {\sum\limits_r {p\left( {s',r|s,a} \right)} } } }r{_t}$

Puis le second terme:

${E_\pi }\left[ {{G_{t + 1}}|{S_t} = s} \right]={E_\pi }\left[ {{G_{t + 1}}|{S_{t + 1}} = s'} \right]\sum\limits_a {\pi \left( {a|s} \right)\sum\limits_{s'} {\sum\limits_r {p\left( {s',r|s,a} \right)} } }$

$=\sum\limits_a {\pi \left( {a|s} \right)\sum\limits_{s'} {\sum\limits_r {p\left( {s',r|s,a} \right)} } } \left[ {r + \gamma {V_\pi }\left( {s'} \right)} \right]$

On en déduit l'équation de Bellman qui permet de calculer les valeurs des états. Cette équation exprime une relation entre la valeur d'un état $s$ et les valeurs des états $s'$ qui le suivent lorsque l'agent utilise la stratégie $\pi$.

$${V_\pi }\left( s \right) = \sum\limits_a {\pi \left( {a|s} \right)\sum\limits_{s'} {\sum\limits_r {p\left( {s',r|s,a} \right)} } } \left[ {r + \gamma {V_\pi }\left( {s'} \right)} \right]$$